Skip to content

Using artificial intelligence to assess personal qualities in college admissions

Lira, Gardner, Quirk et al. (2023)

DisciplineInterdisciplinary
MethodComputational
Tagscollege admissionsdata · secondary survey analysisfairnessholistic reviewlanguage modelsmethod · machine learningmethod · nlpmethod · regressionpersonal qualities

Summary

Problem: 大学录取中的整体性审查(holistic review)在评估申请者个人品质时存在不透明、资源密集且可能隐含偏见的问题。传统的人工评估方式因申请数量激增而难以实施最佳实践(如分项评分、结构化量规、多重独立评估)。虽然AI可能提供高效解决方案,但其“黑箱”特性可能无意中加剧对弱势群体的偏见。本文旨在探索一种既能保持效率又能确保透明度、可解释性和公平性的AI评估方法。 Approach: 研究采用三阶段方法:(1) 由研究助理和招生官在3,131篇申请文书中人工标注七种个人品质的存在与否;(2) 使用这些标注微调RoBERTa预训练语言模型,为每种品质生成连续评分;(3) 将模型应用于30.6万份保留样本,检验计算机生成分数的效度、公平性及对6年大学毕业率的预测能力。 Finding: 微调后的RoBERTa模型成功复现了人类评分,且跨人口亚组表现一致。计算机生成的个人品质分数与人口统计学特征基本无关,并在控制人口学变量、标准化考试成绩和课外活动后,仍对6年大学毕业率具有显著的增量预测效度(招生官模型中6/7项品质显著,ORs 1.030–1.116)。 Significance: 本研究为AI在高等教育录取中的应用提供了首个大规模实证证据,表明通过“人类中心AI”和“可解释AI”框架设计的评估系统,可以在保持效率的同时实现透明度、可解释性和公平性,为改进整体性审查实践提供了可行路径。

Theoretical Framework

  • Theoretical tradition: 心理测量学传统,结合人类中心AI和可解释AI框架。
  • Prior theories built upon: 个人品质(非认知技能、社会情感能力、性格)预测大学成功的纵向研究;心理测量学中信度、效度、可解释性原则;人类中心AI(human-centered AI)和可解释AI(explainable AI)框架。
  • Causal mechanism: 申请文书中的语言表达反映了申请者的个人品质(如领导力、毅力等),这些品质通过影响学生的学业投入、社会融入和坚持行为,进而影响大学毕业率。AI模型通过学习人类专家对语言表达的品质判断模式,捕捉这一因果链条中的关键信号。
  • Key assumptions: (1) 个人品质可以从150字的课外活动/工作经历文书中可靠识别;(2) 人类专家评分可以作为训练AI模型的“金标准”;(3) 语言模型能够学习到与人类判断一致的品质信号;(4) 个人品质在人口亚组间分布相对均匀。
  • Theoretical move: 本文应用并扩展了心理测量学原则和人类中心AI框架,将其首次系统性地应用于大学录取中的个人品质评估,同时挑战了AI在高压情境下必然加剧偏见的假设。
  • Scope conditions: 研究基于2008–2009年Common App申请者样本,涵盖美国各地公立和私立四年制大学;文书限定为150字以内的课外活动/工作经历描述;仅以6年大学毕业率为结果变量。

Research Design

本研究为计算实证研究(computational empirical study),结合了观察性数据分析和预测模型验证。分析单元为个体申请者及其申请文书。关键自变量为七种个人品质的计算机生成分数(prosocial purpose, leadership, teamwork, learning, perseverance, intrinsic motivation, goal pursuit),通过微调RoBERTa模型从文书中生成连续似然分数。因变量为6年大学毕业率(二元变量)。操作化过程:先由研究助理和招生官对3,131篇文书进行二元人工标注(品质存在/不存在),再用这些标注微调RoBERTa模型,生成连续分数。研究还检验了模型的收敛效度(与同品质人类评分相关)、区分效度(与不同品质人类评分不相关)和预测效度(预测毕业率)。

Data & Sample

  • 开发样本:3,131篇申请文书,由研究助理和招生官进行人工标注。其中206篇由多名研究助理编码以计算评分者间信度;全部3,131篇由两名招生官编码。
  • 保留样本:306,463份申请(总样本309,594份,扣除开发样本)。
  • 总体样本:309,594份2008–2009年Common App申请,来自美国各地公立和私立四年制大学。
  • 人口特征:包含种族/族裔、父母教育程度、性别、婚姻状况、英语学习者身份、Title 1高中等变量。
  • 毕业率:保留样本中约78%的学生在6年内大学毕业。
  • 数据来源:Common App申请数据,经去标识化处理。高中GPA仅对43,592名申请者可用(因多数学校以PDF附件提交成绩单,无法去标识化)。

Analytical Strategy

  • 模型训练:使用二元人类评分微调RoBERTa语言模型,为每种品质和每种评分者(研究助理/招生官)分别训练模型。
  • 效度检验:计算计算机生成分数与人类评分的点二列相关(收敛效度)和与不同品质评分的相关(区分效度);使用Krippendorf's α衡量评分者间信度。
  • 预测效度:二元逻辑回归模型预测6年大学毕业率,报告OR值和AUC。模型1仅含个人品质分数;模型2加入人口学变量、标准化考试成绩和课外活动变量作为控制变量。
  • 公平性检验:比较不同人口亚组间收敛效度的差异(多重比较校正);在预测模型中加入个人品质与人口学变量的交互项,检验预测效度是否跨亚组一致;还进行了双重人口亚组交叉分析。
  • 稳健性检验:使用有高中GPA的子样本(n=43,592)进行稳健性检验;训练RoBERTa模型直接预测毕业率以估计文书预测能力上限;使用多重插补处理缺失数据。
  • 模型可解释性:使用transformers-interpret包识别模型依赖的关键词,检验表面效度。

Results & Findings

  • 模型可解释性:模型依赖的关键词具有合理的表面效度。例如,领导力评分与“president”“leader”“captain”等词相关。研究助理和招生官模型产生的词级归因分数高度相关(r = 0.392–0.983)。
  • 收敛与区分效度:计算机生成分数与同品质人类评分显著相关(研究助理模型平均r = 0.74;招生官模型平均r = 0.62),与不同品质评分基本不相关(平均r ≈ 0)。人类评分信度越高,模型表现越好(r = 0.94–0.95)。在多人编码的子样本中,模型与人类评分的相关性甚至高于人类评分者之间的相关性。
  • 跨亚组一致性:收敛效度在不同人口亚组间基本一致。经多重比较校正后,仅13%(研究助理)和9%(招生官)的相关性存在亚组差异,且差异方向各半、幅度较小(平均|Δr| = 0.054–0.10)。
  • 与人口学特征的关系:计算机生成分数与人口学特征基本无关(平均|d| = 0.05–0.08)。唯一例外是女性申请者被评定为比男性更具亲社会目的(d = 0.26–0.28),这与既有研究一致。相比之下,标准化考试成绩与人口学特征的相关性更强(平均|d| = 0.38)。
  • 预测效度:在保留样本中,计算机生成的个人品质分数均显著预测6年大学毕业率(模型1:ORs 1.041–1.252,AUC = 0.560–0.576)。在控制人口学变量、标准化考试成绩和课外活动后(模型2),研究助理模型中5/7项品质仍显著(ORs 1.012–1.075),招生官模型中6/7项品质仍显著(ORs 1.030–1.116)。内在动机和目标追求在研究助理模型中不再显著。
  • 公平性检验:个人品质的预测效度在人口亚组间一致(交互项检验无显著差异),而标准化考试成绩的预测准确性存在亚组差异(平均|β| = 0.053)。交叉亚组分析未发现一致或可解释的模式。
  • 与人类评分的比较:计算机生成分数的预测效度与人类评分相当(AUC差异不显著),且系数略大。
  • 意外发现:直接训练RoBERTa预测毕业率的AUC为0.626,高于仅用个人品质分数的AUC(0.557–0.568),表明文书中还编码了个人品质之外的可预测毕业的信息。

Limitations

  • 数据限制:样本为2008–2009年申请者,未包含Common App现在要求的650字个人陈述(当时以PDF附件提交,无法去标识化);高中GPA仅对43,592名申请者可用。
  • 结果变量单一:仅以6年大学毕业率为结果,未评估GPA、课外参与、校园社区贡献或社会情感福祉等其他大学成功指标。
  • 效应量有限:个人品质预测毕业率的效应量适中,绝对值和相对标准化考试成绩而言均较小(但大于成长型思维等问卷测量的预测效度)。
  • 未测量因素:学费支付能力、学业准备和支持、归属感等已知影响毕业率的因素未纳入分析。
  • 方法论差异:与Alvero等(2020)和Pennebaker等(2014)的研究结果不同,可能源于样本差异(更大更多样的院校集合)、文书类型(150字活动文书 vs. 数百字个人陈述)或方法差异(监督微调 vs. 无监督主题建模/词典方法)。

Key Contributions

  • 首次在超过30万份全国性大学申请样本中系统验证了AI评估个人品质的可行性、有效性和公平性。
  • 证明了基于人类专家评分微调的语言模型可以同时实现收敛效度、区分效度、预测效度和跨亚组公平性,回应了AI“黑箱”偏见的担忧。
  • 提供了“人类中心AI”和“可解释AI”框架在高等教育录取中的具体实施范例,包括分项评分、可解释性分析和公平性审计。
  • 发现计算机生成分数与人类评分预测效度相当,且与人口学特征基本无关,而标准化考试成绩与人口学特征强相关,为AI辅助整体性审查提供了实证支持。
  • 揭示了当前整体性审查缺乏明确、共识性目标的问题,提出AI评估的引入可以促进对录取目标的操作化反思。

Key Claims

"Can artificial intelligence (AI) advance the aims of holistic review? With stunning efficiency, AI systems identify patterns in data and, with stunning fidelity, apply learned models to new cases." (Introduction)

"We found that these models demonstrated convergent, discriminant, and predictive validity, and this evidence was consistent across demographic subgroups. In addition, computer-generated scores were largely independent of demographics." (Discussion)

"It seems likely that personal qualities are distributed more evenly across demographic subgroups than the topics students choose to write about or the words they use to do so." (Discussion)

"One unexpected benefit of evaluating AI approaches, therefore, is the critical perspective brought to the current status of holistic review and selective admissions." (Discussion)

"As context, a growing literature suggests that long-term life outcomes are extremely difficult to predict with precision, in part because the greater the number of factors that determine an outcome, the smaller the influence of any single one." (Discussion)


My Notes